Type: entity
Confidence: 0.95
Created: 2026-04-16
Updated: 2026-04-16
Tags: 推荐系统LLM生成式推荐基础模型RecSys

P5 论文

概述

P5 首次将推荐系统五大核心任务统一为 text-to-text 语言生成问题,通过个性化 Prompt 和 T5 预训练实现"一个模型、一个损失函数、一个数据格式"处理所有推荐场景。

关键内容

  1. 论文信息:全称 "Recommendation as Language Processing (RLP): A Unified Pretrain, Personalized Prompt & Predict Paradigm (P5)",作者 Shijie Geng, Shuchang Liu, Zuohui Fu, Yingqiang Ge, Yongfeng Zhang,机构 Rutgers University,发表于 RecSys 2022(第16届ACM推荐系统会议),arXiv:2203.13366,代码仓库 github.com/jeykigung/P5,引用量 545+。

  2. 核心范式突破:将推荐系统的五大任务——评分预测序列推荐、解释生成、评论摘要、直接推荐——全部转化为自然语言的输入-输出文本对,使用 T5 作为骨干模型,实现"一个模型走天下"。

  3. 模型变体:P5-small(60.75M参数,6层编解码器,512维,8头注意力)和 P5-base(223.28M参数,12层编解码器,768维,12头注意力),使用 SentencePiece 分词器(词汇表 32,128),4块 NVIDIA RTX A5000 GPU 训练 10 epochs。

  4. 47个个性化 Prompt 模板:覆盖五类任务家族,每类包含多种措辞和格式。评分预测采用高斯采样将5个整数类别扩展为41个浮点数类别以避免过拟合序列推荐将用户历史交互编码为自然语言序列;解释生成和评论摘要利用文本生成能力;直接推荐以是/否形式判断偏好。

  5. Whole-word Embedding 设计:对比 P5-I(独立 token)和 P5-S(子词分词 + 全词共享嵌入),实验证明 P5-S 在序列推荐和直接推荐上显著优于 P5-I,通过协同学习获得更好的推荐性能同时保持 token 数量恒定。

  6. 多任务训练策略:从预训练 T5 检查点加载权重,将五类任务数据混合采样,使用标准 seq2seq 交叉熵损失联合训练,推理时使用 beam search(beam size=20)解码。

  7. 实验结果:在 Amazon US Reviews(Sports/Beauty/Toys)和 Yelp Review 数据集上验证。评分预测 MAE 优于传统矩阵分解序列推荐在全量物品设置下评估;直接推荐显著优于 BPR-MF 和 BPR-MLP;生成任务超越参数量大得多的 T0(11B)和 GPT-2(1.5B)。

  8. Zero-shot 推荐能力:保留部分 Prompt 模板用于测试,模型在未见过的 Prompt 格式上仍能给出合理推荐,这是传统推荐模型完全不具备的能力。

  9. 跨域迁移:在一个领域(如 Beauty)预训练的模型可迁移到其他领域(Sports/Toys),虽性能有所下降但仍能提供有意义的推荐。

  10. 局限性:推理效率问题(自回归解码延迟远高于向量内积);物品词汇表可扩展性(百万/亿级 ID 空间);与专用模型的性能差距;数据集规模有限;ID 语义鸿沟(后续 LC-Rec 等试图解决);可复现性挑战(RecSys 2024 专门研究)。

  11. 历史地位RecSys 2022 杰出论文之一,催生 OpenP5、VIP5、InstructRecTALLRecLC-RecLLMRecDEALRec 等后续工作,帮助社区形成"语言是连接不同推荐任务的天然桥梁"的共识。

  12. 金句:"Language can describe almost anything and language grounding is a powerful medium to represent various problems or tasks."(语言可以描述几乎任何事物,语言基础是表示各种问题或任务的强大媒介。)

来源

相关